Suavización Exponencial (SES)

Author

RGA

Published

September 9, 2026

1 Datos preliminares

Usando los datos del archivo monthly-beer-production-in-austr.csv deben cargarlos y revisar los 10 primeros y 10 últimos datos de la tabla.

    Month Monthly.beer.production
1 1956-01                    93.2
2 1956-02                    96.0
3 1956-03                    95.2
4 1956-04                    77.1
5 1956-05                    70.9
6 1956-06                    64.8
      Month Monthly.beer.production
471 1995-03                     152
472 1995-04                     127
473 1995-05                     151
474 1995-06                     130
475 1995-07                     119
476 1995-08                     153

2 Métodos simples de pronósticos

2.1 Método del promedio

El objetivo del pronóstico es simplemente el promedio de los datos históricos

\[\hat{y}_{T+h|T} = \bar{y} = (y_1+\dots+y_t)/T\]

         Point Forecast    Lo 80   Hi 80    Lo 95    Hi 95
Sep 1995       136.3954 93.05179 179.739 70.03017 202.7606
Oct 1995       136.3954 93.05179 179.739 70.03017 202.7606
Nov 1995       136.3954 93.05179 179.739 70.03017 202.7606
Dec 1995       136.3954 93.05179 179.739 70.03017 202.7606
Jan 1996       136.3954 93.05179 179.739 70.03017 202.7606

2.2 Método de Naïve

El pronóstico en este método es simplemente el último valor observado de la serie, esto es,

\[\hat{y}_{T+h|T} = y_T\] Este modelo funciona muy bien para muchas series de tiempo financieras y económicas.

         Point Forecast     Lo 80    Hi 80     Lo 95    Hi 95
Sep 1995            153 127.83894 178.1611 114.51948 191.4805
Oct 1995            153 117.41689 188.5831  98.58033 207.4197
Nov 1995            153 109.41977 196.5802  86.34979 219.6502
Dec 1995            153 102.67788 203.3221  76.03896 229.9610
Jan 1996            153  96.73816 209.2618  66.95495 239.0451

Ya que este método es óptimo para cuando los datos siguen una caminata aleatoria, también es llamado random walk forecast

2.3 Método Naïve estacional

Este modelo que es muy útil cuando se tiene datos con mucha tendencia. En este caso, establecemos cada pronóstico que sea igual al último valor observado de la misma temporada (ejemplo; el mismo mes del año anterior). Formalmente, el pronóstico para el periodo \(T+h\) se escribe como:

\[\hat{y}_{T+h|T} = y_{T+h-m(k+1)}\] donde \(m=\)periodo estacional, \(k\) es la parte entera de \((h-1)/m\) (esto es, el número de años completos en el período previsto anterior al tiempo T+h). Por ejemplo, con datos mensuales, el pronóstico para los futuros febreros será igual al último febrero observado. Con datos trimestrales, el pronóstico para todos los futuros del T2 (segundo trimestre) será igual al último valor observado del T2.

         Point Forecast    Lo 80    Hi 80   Lo 95   Hi 95
Sep 1995            143 126.9594 159.0406 118.468 167.532
Oct 1995            160 143.9594 176.0406 135.468 184.532
Nov 1995            190 173.9594 206.0406 165.468 214.532
Dec 1995            182 165.9594 198.0406 157.468 206.532
Jan 1996            138 121.9594 154.0406 113.468 162.532

2.4 Método a la deriva (drift)

Una variación del modelo de Naïve es permitir que el pronóstico aumente o disminuya a través del tiempo, donde la cantidad del cambio sobre el tiempo (drift) se establece como el cambio promedio visto en los datos históricos. Así el pronóstico para el tiempo T+h está dado por:

\[\hat{y}_{T+h|T} = y_T + \frac{h}{T-1}\sum_{t=2}^{T}(y_t - y_{t-1}) = y_t + h\left(\frac{y_T-y_1}{T-1}\right)\]

Lo anterior es equivalente a dibujar una línea entre la primera y la última observación, y después, extrapolándola al futuro.

         Point Forecast     Lo 80    Hi 80     Lo 95    Hi 95
Sep 1995       153.1259 127.91233 178.3395 114.56507 191.6867
Oct 1995       153.2518 117.55699 188.9466  98.66130 207.8423
Nov 1995       153.3777 109.61486 197.1405  86.44822 220.3072
Dec 1995       153.5036 102.91779 204.0894  76.13929 230.8679
Jan 1996       153.6295  97.01383 210.2451  67.04332 240.2156

2.5 Ejemplos

Ahora, usando otros datos haremos lo mismo, sin embargo, agregaremos la forma visual y de comparación de los modelos.

En la siguiente figura se utiliza el método no estacional y será aplicado a una serie de 200 días del cierre de precio de las acciones de Google

A veces uno de estos métodos simples será el mejor método de previsión o pronóstico disponible; pero en muchos casos, estos métodos servirán como puntos de referencia en lugar del método de elección. Es decir, cualquier método de previsión que desarrollemos se comparará con estos sencillos métodos para garantizar que el nuevo método sea mejor que estas simples alternativas. Si no, el nuevo método no vale la pena considerarlo.

2.6 Ajustes de datos

Dependiendo de las circunstancias se deberá ajustar los datos para una mejor pronóstico, en resumen:

  • Sí tienes efectos calendarios se deberá remover las variaciones antes de ajustar los modelos de pronósticos.

  • Sí se trabaja con poblaciones, lo más recomendable es hacer ajustes per cápita, o por miles o millones de personas

  • Sí estamos con series monetarias lo recomendales es ajustar los datos descontando el fator inflacionario utilizando el índice de precios al consumidor

  • O, finalmente, usar transformaciones matematicas como; logaritmos y potencias o ajustando el sesgo.

2.7 Valores ajustados (fitted values)

Cada observación en una serie de tiempo se puede predecir utilizando todas las observaciones previas. Llamamos a estos, valores ajustados y son denotados por \(\hat{y}_{t|t-1}\), lo que significa que el pronóstico de \(y_t\) basado en las observaciones \(y_1,\dots,y_{t-1}\) . Usaremos estos tan a seguido, a veces dejamos caer parte del subíndice y simplemente escribimos \(\hat{y}_t\) en lugar de \(\hat{y}_{t|t-1}\). Los valores ajustados siempre implican previsiones de un solo paso.

2.8 Residuales

Los “residuals” en un modelo de series de tiempo son lo que sobra después de ajustar un modelo. Para muchos (pero no todos) modelos de series de tiempo, los residuos son iguales a la diferencia entre las observaciones y los valores instalados correspondientes:

\[e_t=y_t-\hat{y}_t\]

Los residuos son útiles para comprobar si un modelo ha captado adecuadamente la información en los datos. Un buen método de previsión producirá residuos con las siguientes propiedades:

  • Los residuos no están relacionados. Si hay correlaciones entre los residuos, entonces queda información en los residuos que debe utilizarse en los cálculos del pronóstico.
  • Los residuos tienen media cero. Si los residuos tienen una media distinta a cero, entonces las previsiones están sesgadas.

Cualquier método de previsión que no satisfaga estas propiedades se puede mejorar. Sin embargo, eso no significa que los métodos de pronóstoco que satisfagan estas propiedades no puedan mejorarse. Es posible tener varios métodos de predicción diferentes para el mismo conjunto de datos, todos los cuales satisfacen estas propiedades. Comprobar estas propiedades es importante para ver sí un método está utilizando toda la información disponible, pero no es una buena manera de seleccionar un método de previsión.

Si alguna de estas propiedades no está satisfecha, entonces el método de previsión puede ser modificado para dar mejores resultados. Ajustarse el sesgo de los residuales es fácil: si los residuos tienen media digamos de valor “m”, entonces simplemente añadir “m” a todas las previsiones y el problema de sesgo se resuelve. Por otro lado, arreglar el problema de correlación es más difícil, y se abordara hasta los capítulos más avanzados.

Además de estas propiedades esenciales, es útil (pero no necesario) para los residuos también tener las siguientes dos propiedades.

  • Los residuos tengan varianza constante.
  • Los residuos se distribuyan normalmente.

Estas dos propiedades facilitan el cálculo de los intervalos de predicción. Sin embargo, no se puede mejorar necesariamente un método de previsión que no satisfaga estas propiedades. A veces aplicar una transformación de Box-Cox puede ayudar con estas propiedades, pero de lo contrario hay poco que usted puede hacer para asegurarse de que sus residuos tienen varianza constante y una distribución normal. En cambio, es necesario un enfoque alternativo para obtener intervalos de predicción.

2.9 Ejemplo

Para los precios e índices bursátiles, el mejor método de previsión suele ser el método Naïve. Es decir, cada pronóstico es simplemente igual al último valor observado, o \(y_t=y_{t-1}\). Por lo tanto, los residuos son simplemente iguales a la diferencia entre observaciones consecutivas:

\[e_t=y_t−\hat{y}_t=y_t−y_{t−1}\]

Los residuales obtenidos se grafican a continuación

Normalidad de los residuos

Warning: Removed 1 row containing non-finite outside the scale range
(`stat_bin()`).
Warning: Removed 1 row containing missing values or values outside the scale range
(`geom_rug()`).

Autocorrelograma

Estos gráficos muestran que el método de Naïve produce pronósticos que parecen explicar toda la información disponible. La media de los residuos es cercana a cero y no hay correlación significativa en la serie de residuos. El autocorrelograma de los residuos muestra que la variación de los residuos se mantiene muy igual a través de los datos históricos, aparte de la atípica, y por lo tanto la varianza residual puede ser tratada como constante. Esto también se puede ver en el histograma de los residuos. El histograma sugiere que los residuos pueden no ser normales. La cola correcta parece un poco demasiado largo, incluso cuando ignoramos lo atípico. En consecuencia, las previsiones de este método probablemente serán bastante buenas, pero los intervalos de predicción que se calculan suponiendo que una distribución normal puede ser inexacto.


    Box-Pierce test

data:  res
X-squared = 10.611, df = 10, p-value = 0.3886

    Box-Ljung test

data:  res
X-squared = 11.031, df = 10, p-value = 0.3551

2.10 Examinando la precisión del modelo

Para elegir cual modelo es el que presenta un mejor rendimiento, debemos utilizar distintas métricas enfocadas en el error. Para ello, debemos revisar la desviación que tengan los errores de los distintos modelos calculados. En ocasiones se dividirán los datos en dos partes, utilizando una parte para entrenar (train data set) el modelo y otra para para realizar las pruebas al modelo (test data set). Generalmente, se harían los pronósticos sobre el conjunto de datos de prueba (test df).

los errores los definimos como:

\[e_t = y_t-\hat{y}_t\] Para verificar el rendimiento de los modelos usaremos 3 de varias medidas, a saber:

  • MAE: Mean Absolute Error, error absoluto promedio \(MAE=mean(|e_t|)\)
  • RMSE: Root Mean Squared Error \(\sqrt{mean(|e^2_t|)}\)
  • MAPE: Mean Absolute Percentage error \(mean(|p_t|)\), donde; \(p_t= 100e_t/y_t\)
  • MASE: Mean Absolute Scaled Error \(MASE=mean(|q_j|)\), donde; \(q_j=\frac{e_j}{\frac{1}{T-m}\sum^{T}_{t=m+1}|y_{t}-y_{t-m}|}\)

                  ME     RMSE      MAE        MPE     MAPE     MASE        ACF1
Training set   0.000 43.62858 35.23438 -0.9365102 7.886776 2.463942 -0.10915105
Test set     -13.775 38.44724 34.82500 -3.9698659 8.283390 2.435315 -0.06905715
             Theil's U
Training set        NA
Test set      0.801254
                      ME     RMSE      MAE         MPE     MAPE     MASE
Training set   0.4761905 65.31511 54.73016  -0.9162496 12.16415 3.827284
Test set     -51.4000000 62.69290 57.40000 -12.9549160 14.18442 4.013986
                    ACF1 Theil's U
Training set -0.24098292        NA
Test set     -0.06905715  1.254009
                    ME     RMSE  MAE        MPE     MAPE      MASE       ACF1
Training set -2.133333 16.78193 14.3 -0.5537713 3.313685 1.0000000 -0.2876333
Test set      5.200000 14.31084 13.4  1.1475536 3.168503 0.9370629  0.1318407
             Theil's U
Training set        NA
Test set      0.298728

3 Regresión lineal

En el caso más simple, el modelo de regresión permite una relación lineal entre la variable de previsión \(y\) y una única variable predictora \(x\):

\[y_t = \beta_0+\beta_1x_t+\epsilon_t\]

El coeficientes \(\beta_0\) y \(\beta_1\) denotan el intercepto y la pendiente de la línea, respectivamente. El intercepto \(\beta_0\) representa el valor predicho de \(y\) cuando \(x=0\). La pendiente \(\beta_1\) representa el cambio promedio previsto en \(y\) resultante de un aumento de una unidad en \(x\).

3.1 Ejemplo

Un gráfico de dispersión de los cambios de consumo contra los cambios de ingresos se muestra en la figura de arriba, junto con la línea de regresión estimada.

\[\hat{y}_t=0.55-0.28x_t \]

(Pusimos un “sombrero” encima de \(y\) para indicar que este es el valor de \(y\) predicho por el modelo.)

La línea ajustada tiene una pendiente positiva, que refleja la relación positiva entre el ingresos y el consumo. El coeficiente de la pendiente muestra que un incremento de una unidad en \(x\) (un aumento de 1 punto porcentual en el ingreso personal disponible) resulta en promedio en un aumento de \(0.28\) unidades en \(y\) (un aumento promedio de \(0.28\) puntos porcentuales en el gasto personal de consumo). Alternativamente, la ecuación estimada muestra que un valor de \(1\) para \(x\) (el aumento porcentual en la renta personal disponible) resultará en un valor pronosticado de \(0.55-0.28-1=0.83\) para \(y\) (el aumento porcentual del gasto en consumo personal).

La interpretación del intercepto requiere que un valor de \(x=0\) tiene sentido. En este caso cuando \(x=0\) (es decir, cuando no hay ningún cambio en la renta personal disponible desde el último trimestre) el valor previsto de \(y\) es de \(0.55\) (es decir, un aumento promedio del gasto en consumo personal de \(0.55%\)). Incluso cuando \(x=0\) no tenga sentido, la interceptación es una parte importante del modelo. Sin ella, el coeficiente de pendiente se puede distorsionar innecesariamente. La interceptación debe incluirse siempre a menos que el requisito sea forzar la línea de regresión a través del origen. En lo que sigue suponemos que una interceptación siempre está incluida en el modelo.

3.2 Regresión lineal múltiple

Cuando hay dos o más variables predictoras, el modelo se llama un modelo de regresión múltiple. La forma general de un modelo de regresión múltiple es

\[y_t=β_0+β_1x_{1,t}+β_2x_{2,t}+\dots+β_kx_{k,t}+ε_t\]

donde \(y\) es la variable a pronosticar y \(x1,\dots,xk\) son las “k” variables de predictoras. Cada una de las variables predictoras debe ser numérica. Los coeficientes \(\beta\) \(1,\dots,k\) miden el efecto de cada predictor después de tener en cuenta los efectos de todos los demás predictores del modelo. Así, los coeficientes miden los efectos marginales de las variables predictores.

3.3 Supuestos

Cuando utilizamos un modelo de regresión lineal, estamos haciendo implícitamente algunas suposiciones sobre las variables en Ecuación anterior.

En primer lugar, asumimos que el modelo es una aproximación razonable a la realidad; es decir, la relación entre la variable de pronóstico y las variables predictoras satisface esta ecuación lineal.

En segundo lugar, hacemos las siguientes suposiciones sobre los errores \((\epsilon_1,\dots,\epsilon_T)\):

  • Tienen mediar cero; de lo contrario, los pronósticos se sesgarán sistemáticamente.
  • No están autocorrelacionadas; de lo contrario, los pronósticos serán ineficientes, ya que hay más información en los datos que se pueden explotar.
  • No están relacionadas con las variables predictoras; de lo contrario habría más información que debería incluirse en la parte sistemática del modelo.

También es útil tener los errores que normalmente se distribuyen con una varianza constante \(\sigma^2\) con el fin de producir fácilmente intervalos de predicción.

Otra suposición importante en el modelo de regresión lineal es que cada predictor \(x\) no es una variable aleatoria. Si estamos realizando un experimento controlado en un laboratorio, podríamos controlar los valores de cada \(x\) (para que no fueran aleatorios) y observar los valores resultantes de \(y\). Con datos observacionales (incluyendo la mayoría de los datos en negocios y economía), no es posible controlar el valor de \(x\), simplemente los observamos. De ahí que hagamos de esto una suposición.

3.4 Tarea